阅读更多
引用
作者简介:文刘飞,杉岩数据联合创始人 引擎架构师

编者按:服务器虚拟化技术在提高服务器利用率的同时,也消耗了大量的CPU、内存和网络带宽资源,本文从存储卸载加速的背景出发,探讨基于分布式存储的Windows ODX的实现与优化。

1.存储卸载加速的背景
服务器虚拟化成为数据中心的主流技术,大量运行的虚拟机大大提高了服务器的利用率,对虚拟机进行批量的创建、复制、迁移极大的简化了IT运维的同时,也带来了大量的数据拷贝操作,进而消耗了服务器的大量CPU、内存和网络带宽资源。

针对于这些问题,VMware提出了VAAI(vStorage API for Array Integration)接口,希望将VMware基础架构的某些功能委托给存储阵列去实现,通过减少数据对于虚拟机和物理服务器的资源消耗,从而提升VMware基础架构的性能。

同时,Microsoft也在Windows 8或Windows Server 2012中新增了卸载数据传输(Offloaded Data Transfer ODX)这一功能,期望把数据拷贝功能卸载到存储硬件中,降低虚拟化服务器的开销。

本文将和您一起探讨Windows ODX的实现与优化

通过配合支持卸载的存储硬件使用,ODX可在不占用 Hyper-V 宿主机 CPU 资源的情况下通过存储设备执行文件复制操作,由存储设备直接从一个存储位置读取数据,并写入到另一个位置。卸载数据传输的设计符合T10 XCOPY Lite规范,对数据拷贝加速进行了端到端的设计,理论上支持在不同存储厂商的存储设备之间进行数据复制。

2.ODX实现原理概述
ODX使用基于令牌的机制在智能存储阵列内部或之间复制数据。待复制的源文件和目标文件可以在同一个卷上、同一服务器管理的两个不同卷、或者多个服务器共享的群集共享卷上。

令牌是一个512字节的随机数,令牌代表了一个或多个extent(最多128MB的实际数据),一般是一个文件或文件的一部分。令牌由存储控制器通过哈希算法产生,同时令牌具有一定的生命周期。因此微软一直认为安全性和兼容性是Windows ODX区别于 VMware VAAI的一个显著特征。

由于传给主机的是代表数据的令牌,而不是数据本身,因此大大提高了数据复制的性能。同时由于ODX的命令交互比较多,因此ODX文件复制要求文件至少为256KB,太小的文件所产生的开销会使得XCOPY操作变得没有任何意义。

图1 Windows ODX基于令牌的复制操作

如上图所示,利用ODX实现数据复制的主要操作流程如下所示:
  • 用户通过Windows Explorer或命令行执行文件复制/移动。
  • Windows 8或Windows Server 2012发送一个读请求给存储控制器要求执行数据拷贝(POPULATE_TOKEN命令,包含了源LBA/Block length pair list)
  • 存储控制器创建代表数据的令牌并发送回主机(SP创建PIT token)
  • 主机使用令牌发起写请求给存储控制器(WRITE_USING_TOKEN命令,包含一个目标LBA/Block length pair list)
  • 存储控制器根据令牌信息,验证令牌的有效性和源数据位置,并把数据传输数据到目标位置。
  • 最后存储控制器把ODX复制的结果发送给主机(主机使用RECEIVE_ROD_TOKEN_INFORMATION命令查询结果)

为了实现ODX功能,ODX增加了如下几个SCSI命令:
  • POPULATE_TOKEN命令,发送卸载读请求给存储控制器,请求针对虚拟磁盘LUN A的某段数据产生一个数据令牌。
  • WRITE_USING_TOKEN命令,携带数据令牌发送卸载写请求给存储控制器,请求把该令牌所代表的数据复制到指定位置。
  • RECEIVE_ROD_TOKEN_INFORMATION 命令,发送卸载查询请求给存储控制器,查询卸载读/写的结果。

3.ODX在分布式存储的优化

3.1令牌的管理和同步
对于分布式存储集群,通常会提供多个存储控制器来实现IO的并发访问以及IO路径的高可用(如图2所示)。同时Windows服务器通过iSCSI MPIO和分布式存储连接以后,ODX可能会对不同的存储控制器分别下发POPULATE_TOKEN命令和WRITE_USING_TOKEN命令。这就要求某一个存储控制器产生的数据令牌需要和其他存储控制进行实时同步。同时令牌具有一定的生命周期, 因此存储控制器需要保证数据令牌的唯一性,并且定期清理已经过期的数据令牌。

图2 提供多个ISCSI服务端的分布式存储集群


3.2 ODX相关参数调优
ODX进行数据复制时,默认传输的一个数据片段大小为64MB,支持传输的最大数据片段为256MB。由于不同的分布式存储环境,所配置的HDD、SSD磁盘数量各不相同,因此不同环境最有的数据传输切片大小也各不一样。ODX支持通过存储的VPD描述去建议最优的数据切片大小。因此可以结合分布式存储的配置情况,选择最优的数据传输片段大小。

考虑到分布式存储在产生数据令牌时,需要在各存储控制器之间通过网络进行实时同步,时延开销比较大,因此可以通过配置参数,最大化数据令牌所代表的数据块大小,减少POPULATE_TOKEN命令的发送次数。

3.3 ODX相关的流量控制以及一些异常处理
ODX进行数据复制时,通常都是大数据块的读写,这样会对存储服务器的硬盘带来很大的压力,进而影响对其他IO业务的处理。因此有必要在同时存在其他业务IO时,对ODX相关的IO做一定的流量限制。

在某些异常场景,WRITE_USING_TOKEN命令的目标位置和源文件位置会发生重叠,这样有可能会导致数据处理不正确,因此在执行写操作前需要增加一些位置校验。

4.ODX的优化效果
杉岩数据的SandStone UPS作为企业级软件定义存储产品,对Windows ODX实现了完美的支持,借助ODX,SandStone UPS大大节省服务器的网络带宽和CPU资源。下图为Windows 2012服务器通过1G网络连接SandStone USP进行数据复制的测试。

从任务管理器可以看到,在做数据复制时,网络带宽和内存、CPU消耗都不大,特性是网络带宽只占用了200K左右,但是数据复制显示的速度平均有200MB,远超过1G网络带宽的限制。(说明一下:200k是Windows和存储控制器直接带宽,Windows只是发送控制命令,实际的数据传输是在存储网络间进行的。)

以上,就是我们在Windows ODX上的具体优化实践,本着开放、务实的技术理念,未来,将积极吸取行业的优秀经验和技术产品,从而为用户打造一套更加完善的需求解决方案。(责编/魏伟)
  • 大小: 69.9 KB
  • 大小: 120.7 KB
  • 大小: 144.8 KB
1
0
评论 共 0 条 请登录后发表评论

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

  • AUTOSAR从入门到精通-中间件通信DDS(三)

    DDS(Data Distribution Service数据分发服务)是对象管理组织OMG的有关分布式实时系统中数据发布的一个较新的规范(2004年12月发布1.0版,2007年1月发布1.2版)。DDS规范采用了发布/订阅体系结构,但对实时性要求提供更...

  • 开发者必看!Windows Server 2012全攻略

    品牌:微软操作系统1Windows Server 2012概论 与往常不同的是,今年在服务器领域发生了翻天覆地的变化。从底层的新品架构推动服务器基础设施扑面而来的升级换代,到构建云基础架构平台上分布式处理系统应对大数据...

  • 微软HPC解决方案概述与实作

    例如,一个分布式群集的节点,可以是server,pc,hpc,可以是跨机房,跨地区,跨国,可以是windows,linux,unix,可以分布式计算里面再包括多个群集,多个节点,基本上分布式群集最大的一个特点,就是对提供计算的...

  • 微软HPC解决方案

    首先我们先来看下高性能群集与其它几种群集的不同   高可用群集:群集所有节点,来维持一个应用的持续运作,如果当前应用所在节点失败,自动故障转移至其它节点 负载均衡群集:群集所有节点来平衡一个应用的访问...

  • BizTalk学习笔记系列之二:实例说明如何使用BizTalk

    存储和交付体系结构组合在一起,使基于编排的应用场合的吞吐率有了极大的提高。 该编排引擎通过自动事务缓冲池进一步优化了性能。此外,该引擎的向外扩充模型允许编排处理以负载平衡的方式分散在一个 BizTalk 群集...

  • Biztalk 知识整理

    我们就用这个来实现发送端口与接收端口的关联。在条件表达式中设置: BTS.ReceivePortName == ReceiveFiles  10. 启动BizTalk 应用程序验证程序  右击Hello World应用程序选择Start。打开刚才配置的接收文件夹...

  • 基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip

    【优质项目推荐】 1、项目代码均经过严格本地测试,运行OK,确保功能稳定后才上传平台。可放心下载并立即投入使用,若遇到任何使用问题,随时欢迎私信反馈与沟通,博主会第一时间回复。 2、项目适用于计算机相关专业(如计科、信息安全、数据科学、人工智能、通信、物联网、自动化、电子信息等)的在校学生、专业教师,或企业员工,小白入门等都适用。 3、该项目不仅具有很高的学习借鉴价值,对于初学者来说,也是入门进阶的绝佳选择;当然也可以直接用于 毕设、课设、期末大作业或项目初期立项演示等。 3、开放创新:如果您有一定基础,且热爱探索钻研,可以在此代码基础上二次开发,进行修改、扩展,创造出属于自己的独特应用。 欢迎下载使用优质资源!欢迎借鉴使用,并欢迎学习交流,共同探索编程的无穷魅力! 基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip 基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip 基于业务逻辑生成特征变量python实现源码+数据集+超详细注释.zip

  • 六一儿童节快乐!(六一儿童节庆祝代码)Vue开发

    六一儿童节快乐!(六一儿童节庆祝代码)Vue开发 like Project setup npm install Compiles and hot-reloads for development npm run serve Compiles and minifies for production npm run build Lints and fixes files npm run lint Customize configuration

  • uniapp聊天工具源码.zip

    提供的源码资源涵盖了安卓应用、小程序、Python应用和Java应用等多个领域,每个领域都包含了丰富的实例和项目。这些源码都是基于各自平台的最新技术和标准编写,确保了在对应环境下能够无缝运行。同时,源码中配备了详细的注释和文档,帮助用户快速理解代码结构和实现逻辑。 适用人群: 这些源码资源特别适合大学生群体。无论你是计算机相关专业的学生,还是对其他领域编程感兴趣的学生,这些资源都能为你提供宝贵的学习和实践机会。通过学习和运行这些源码,你可以掌握各平台开发的基础知识,提升编程能力和项目实战经验。 使用场景及目标: 在学习阶段,你可以利用这些源码资源进行课程实践、课外项目或毕业设计。通过分析和运行源码,你将深入了解各平台开发的技术细节和最佳实践,逐步培养起自己的项目开发和问题解决能力。此外,在求职或创业过程中,具备跨平台开发能力的大学生将更具竞争力。 其他说明: 为了确保源码资源的可运行性和易用性,特别注意了以下几点:首先,每份源码都提供了详细的运行环境和依赖说明,确保用户能够轻松搭建起开发环境;其次,源码中的注释和文档都非常完善,方便用户快速上手和理解代码;最后,我会定期更新这些源码资源,以适应各平台技术的最新发展和市场需求。

  • NX二次开发uc1603 函数介绍

    NX二次开发uc1603 函数介绍,Ufun提供了一系列丰富的 API 函数,可以帮助用户实现自动化、定制化和扩展 NX 软件的功能。无论您是从事机械设计、制造、模具设计、逆向工程、CAE 分析等领域的专业人士,还是希望提高工作效率的普通用户,NX 二次开发 Ufun 都可以帮助您实现更高效的工作流程。函数覆盖了 NX 软件的各个方面,包括但不限于建模、装配、制图、编程、仿真等。这些 API 函数可以帮助用户轻松地实现自动化、定制化和扩展 NX 软件的功能。例如,用户可以通过 Ufun 编写脚本,自动化完成重复性的设计任务,提高设计效率;或者开发定制化的功能,满足特定的业务需求。语法简单易懂,易于学习和使用。用户可以快速上手并开发出符合自己需求的 NX 功能。本资源内容 提供了丰富的中英文帮助文档,可以帮助用户快速了解和使用 Ufun 的功能。用户可以通过资源中的提示,学习如何使用 Ufun 的 API 函数,以及如何实现特定的功能。

  • 【目标检测数据集】遥感类军用飞机检测数据集3800张20类别VOC+YOLO格式.zip

    【目标检测数据集】遥感类军用飞机检测数据集3800张20类别VOC+YOLO格式.zip 数据集格式:Pascal VOC格式+YOLO格式(不包含分割路径的txt文件,仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件) 图片数量(jpg文件个数):3821 标注数量(xml文件个数):3821 标注数量(txt文件个数):3821 标注类别数:20 标注类别名称:["A1","A2","A3","A4","A5","A6","A7","A8","A9","A10","A11","A12","A13","A14","A15","A16","A17","A18","A19","A20"] 每个类别标注的框数: A1 框数 = 1646 A2 框数 = 1726 A3 框数 = 1164 A4 框数 = 642 A5 框数 = 1262 A6 框数 = 436 A7 框数 = 680 A8 框数 = 944 A9 框数 = 1073 A10 框数 = 924 A11 框数 = 501 A12 框数 = 702 A13 框数 = 1652 A14 框数 = 177

  • grpcio-1.64.0-cp38-cp38-win_amd64.whl

    Python库是一组预先编写的代码模块,旨在帮助开发者实现特定的编程任务,无需从零开始编写代码。这些库可以包括各种功能,如数学运算、文件操作、数据分析和网络编程等。Python社区提供了大量的第三方库,如NumPy、Pandas和Requests,极大地丰富了Python的应用领域,从数据科学到Web开发。Python库的丰富性是Python成为最受欢迎的编程语言之一的关键原因之一。这些库不仅为初学者提供了快速入门的途径,而且为经验丰富的开发者提供了强大的工具,以高效率、高质量地完成复杂任务。例如,Matplotlib和Seaborn库在数据可视化领域内非常受欢迎,它们提供了广泛的工具和技术,可以创建高度定制化的图表和图形,帮助数据科学家和分析师在数据探索和结果展示中更有效地传达信息。

  • Kan网络pytorch的实现

    权重替换:KAN网络通过将权重参数替换为可学习的单变量函数,提高了网络的性能和可解释性。这种设计使得KAN网络在准确性和可解释性方面优于传统的多层感知器(MLP)。 激活函数位置:与传统的MLP不同,KAN网络中的激活函数位于网络的“边”(即权重)上,而不是节点上。这使得KAN网络能够更灵活地调整每个连接上的激活函数,从而提高模型的表示能力。 非线性核函数:KAN网络可以使用非线性核函数来替代MLP“边”上的线性函数,进一步增强了模型的非线性处理能力。 逼近精度:KAN网络可以设定细粒度的结点(Knot)来提高逼近精度,这使得KAN网络在处理复杂任务时能够获得更高的准确度。 KAN网络的数学理论基础主要来自于Kolmogorov-Arnold表示定理。该定理指出,任意一个多变量连续函数都可以表示为有限数量的单变量连续函数的两层嵌套加法的形式。KAN网络正是基于这一定理,通过将多元函数的学习转化为对一组单变量函数的学习,提高了模型的表达能力和计算效率。

  • MySQL的performance-schema详解.md

    MySQL的performance_schema详解.md

  • 基于python的运动员数据分析源码.zip

    基于python的运动员数据分析源码.zip 基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip基于python的运动员数据分析源码.zip

  • 数字图像处理-实验一:采样与量化.rar

    内容概要: 这份资源是一份关于“图像的采样与量化”的实验文档,详细记录了在MATLAB环境下进行图像处理的实验过程。文档中介绍了实验的目的、内容、所需仪器与设备,以及实验原理,包括采样和量化的基本概念和它们在图像处理中的重要性。此外,还提供了MATLAB代码示例,展示了如何对图像进行不同程度的采样和量化,并分析了实验结果。 适用人群: 本文档适用于学习数字图像处理的大学生、研究生,以及相关专业的研究人员和开发人员。特别是对MATLAB编程和图像处理技术感兴趣的初学者,可以通过这份文档快速入门并理解图像采样与量化的基本原理。 使用场景及目标: 在学术教学中,作为图像处理课程的实验教材或辅助资料。 作为自学者的实践指南,帮助学习者通过动手实践来掌握图像采样和量化的技能。 为研究人员提供图像处理技术的理论基础和编程实践,以支持更高级的研究工作。

  • 基于云函数的小程序-初恋.rar

    基于云函数的小程序-初恋.rar

  • V4L2示例代码,测试通过

    V4L2示例代码

  • 机器学习数据 (1).xlsx

    机器学习数据 (1)

Global site tag (gtag.js) - Google Analytics